iT邦幫忙

2026 iThome 鐵人賽

DAY 21
0

Day 20 的三個後驗權重加起來應為 1;若忘了正規化,即使 Bayes 更新的說明寫得流暢,答案仍會錯。今天沿用這個手算案例,將 alpha(內部一致性信度係數,不證明單一構念)、2PL(雙參數邏輯模型)反應機率與題目資訊量放進同一套檢查:先辨認符號,再核對推理,最後代入能觸發錯誤的數值。這裡檢查的是計算,不把示範錯誤當成已記錄的 Claude 實測。

三層驗算

層 要問什麼 常抓到的錯
符號 每個量是 scalar、vector 還是 matrix?條件在哪裡? 把個人分數乘 reliability;轉置或索引錯
邏輯 公式由哪些定義/假設來?極端情況合理嗎? 把 alpha 當單維;把 information 當全域品質
數值 代入一組可手算值,範圍、單調與邊界是否正確? logistic 符號反轉;posterior 未正規化

表格的用途是把「我看得懂」改成三種可失敗檢查。它不等同形式化證明,也不能驗證模型假設在資料中成立。

六層責任

資料機制沿用各原公式的模型;目標是核對公式輸出及其解釋;假設須從 alpha、2PL 與 CAT 各章帶入,不能因換了例題就省略;可觀察量是題目共變異數或反應模式;計算規則是逐式代值,再與程式對照(CAT 指電腦適性測驗,依目前估計選下一題的公式);能找出內部不一致,但不能只靠代值證明模型適用真實資料。

若一個公式在數值例通過,只表示此例沒有觸發錯誤。反例與邊界要刻意設計,不能把一次正確當一般證明。

完整例題 1:alpha 的括號

Day 13 的四題例有 k=4、題目變異數(variance)總和 4、總分變異數 8.8:

α = 4/3 × (1 − 4/8.8) ≈ 0.727

代入 k 等於 4,alpha 約 0.727。

Claude 若漏掉 k/(k-1),會得到 0.545;若把總分變異數誤寫成題目(item)變異數相加,分母成 4,alpha 變 0。數值 check 立刻顯示公式失去共變異數(covariance)資訊。邏輯 check 再提醒:即使 0.727 算對,也沒檢驗 tau-equivalence 或 dimensionality。

完整例題 2:2PL 的方向

使用 P=1/[1+exp{-a(θ-b)}],a=1.5,b=.5。在 θ=b 時 P 必為 .5;θ 從 -.5、.5、1.5 增加時,P 約 .182、.5、.818。若 Claude 寫成 exp{+a(θ-b)},曲線反向,邊界 test 會失敗。

information I=a²P(1-P) 在 P=.5 時達局部最大。若答案寫 aP(1-P),a=1.5 時得到 .375 而非 .5625;維度與推導層都應追查平方從 score-function 變異數而來,而不是只記正確答案。

完整例題 3:posterior weights

Day 20 的 B 題作答 1,在 θ grid -1,0,1 的 likelihood 約 .095,.321,.679。相同 prior 下,總和 1.095,正規化後約 .087,.293,.620,posterior mean 約 .533(prior 即先驗分布)。未正規化直接做加權平均會得到 .584,而 weights 總和也不是 1。這是一個簡單但有效的 invariant。

Claude 協作:先要 derivation map,再要解釋

我不再問「請解釋這個公式」。輸出契約改成:列 definitions、assumptions、algebra steps、allowed range、two boundary cases、one numeric example、one common misuse。Claude 初稿若跳過某步,就標示 gap;不能用「顯然」替代。

可用前章的兩句錯話檢查解釋:「信度是個人分數的真實比例」與「高鑑別參數永遠更好」。第一句需回 Day 12 的母體變異定義;第二句要看內容涵蓋與局部相依。若只是加上「通常」或「可能」,卻沒有改正估計對象,仍未通過。這些反例讓修改有具體依據,不靠語氣判斷嚴謹程度。

反例:公式對,索引錯

程式將每題 information 算對,卻用上一步 θ 選題、更新後又把作答反應(response)寫到另一個題目 ID。每個局部公式都可通過,CAT trace(執行軌跡)仍錯。驗算因此需要 object identity 與狀態順序,不只數學。Day 22 的程式卡會保存題目 ID、input hash(檔案校驗值)與 step trace。

另一個 failure case(失敗案例)是用 rounding 過早。每步把 P 四捨五入到一位,經多題 likelihood 相乘後可能明顯偏離。文章顯示值可簡化,程式內部應保留足夠精度,並說明顯示數字無法逐位重建完整結果。

跟做時,先不看本文答案,分別計算括號、指數與權重總和;再只改一項設定,預測結果應往哪個方向移動。若算出的方向與預測不同,就回符號定義查起。這能區分抄對算式與理解每個量如何作用,也能留下可供下次修稿重跑的例子。

用同一組數值重做一次

今日產物是符號—邏輯—數值驗算表與三個可手算 probes(檢查題)。它解決「公式看似合理如何查」,沒有證明任何模型適合真實資料。基礎閱讀回前章 definitions;發展閱讀追 derivation 與 estimator(估計方法);前沿閱讀可進 automatic differentiation、property-based testing 與形式化驗證。

下一篇把同一責任帶進 R:程式要能跑、也要鎖定資料、套件、seed(隨機種子)、輸出與推論邊界。成功結束的 console 只是一個關卡。

驗算的終點不是得到預期數字,而是知道這個數字在什麼條件下可以被使用。

來源與協作揭露

  • Chalmers, R. P. (2012). mirt。

上一篇
從 2PL 到 CAT:用 item information 選下一題
下一篇
讓模型真的跑起來:用 R 重現 lavaan 與 mirt 分析
系列文
不是叫 AI 寫教科書:大學教師用 Claude 自學心理計量,打造可驗證、可再教的客製化教材 共 22 篇
圖片
  熱門推薦
圖片
{{ item.channelVendor }} | {{ item.webinarstarted }} |
{{ formatDate(item.duration) }}
直播中

尚未有邦友留言

立即登入留言